Claude Sonnet 4.6: ъпгрейд с 1M контекст и по-силни умения за код и работа с компютър

Anthropic обнови линията Sonnet с Claude Sonnet 4.6 — модел, който разширява възможностите си в програмиране, работа с компютър, разсъждения върху дълъг контекст, агентно планиране и задачи от типа „knowledge work“. Sonnet 4.6 включва и контекстен прозорец от 1M токена (в бета), насочен към обработка на много големи обеми информация в една заявка.
За потребителите на плановете Free и Pro Sonnet 4.6 става модел по подразбиране в claude.ai и Claude Cowork, като цените остават като при Sonnet 4.5 — от $3/$15 на милион токена.
По-добър код и по-малко „шум“ при изпълнение на инструкции
Sonnet 4.6 е позициониран като значително по-силен в писането и редактирането на код, с акцент върху последователност и по-точно следване на инструкции. В тестове в Claude Code ранни потребители са предпочели Sonnet 4.6 пред Sonnet 4.5 приблизително в 70% от случаите, като са посочили по-добро „прочитане“ на контекста преди промени по кода и по-умело обединяване на споделена логика вместо дублиране.
В същите ранни сравнения Sonnet 4.6 е бил предпочетен и пред Claude Opus 4.5 в 59% от случаите. Оценките описват модела като по-малко склонен към свръхинженеринг и „lazy“ поведение, с по-добро изпълнение на многостъпкови задачи, по-малко неверни твърдения за успешен резултат и по-малко халюцинации.
Работа с компютър: напредък по OSWorld и по-добра защита от prompt injection
Една от ключовите области е „computer use“ — взаимодействие със софтуер по начин, близък до човешкия (кликове и въвеждане през виртуална клавиатура), без специални API интеграции или персонализирани конектори. Това е важно за организации, които използват по-стари или специализирани системи, които трудно се автоматизират по стандартен начин.
OSWorld — утвърден бенчмарк за компютърна употреба на AI — измерва изпълнение на стотици задачи в реални приложения като Chrome, LibreOffice и VS Code в симулирана среда. Според описаните резултати Sonnet моделите са подобрявали представянето си в рамките на 16 месеца, а ранни потребители на Sonnet 4.6 съобщават за „човешко ниво“ при конкретни задачи като навигация в сложни електронни таблици и попълване на многостъпкови уеб форми, включително работа през множество табове.
Anthropic отбелязва, че моделът все още изостава от най-умелите хора при работа с компютър, но темпът на развитие прави тази функционалност по-практична за работни процеси.
Паралелно се подчертават и рисковете от prompt injection — скрити инструкции в уеб страници, които могат да „пренасочат“ поведението на модела. Вътрешните оценки сочат, че Sonnet 4.6 е значително по-устойчив спрямо Sonnet 4.5 и е на сходно ниво с Opus 4.6 по този показател. Насоки за ограничаване на подобни рискове се посочват в API документацията.
1M токена контекст и по-силно планиране в дълъг хоризонт
Контекстният прозорец от 1 милион токена (в бета) е насочен към случаи като анализ на цял кодов проект, дълги договори или десетки научни статии в една заявка. Акцентът е не само в обема, а и в способността моделът да разсъждава ефективно върху натрупания контекст, което е важно за планиране и последователно изпълнение на задачи във времето.
Като пример е посочена оценка във Vending-Bench Arena — среда, която измерва доколко моделът може да управлява (симулиран) бизнес в продължителен период и в конкурентен режим. Sonnet 4.6 е демонстрирал стратегия с агресивни инвестиции в капацитет в първите десет симулирани месеца и последващо рязко пренасочване към печалба във финалната фаза, което му е помогнало да изпревари конкурентите.
В корпоративни сценарии се открояват подобрения при фронтенд разработка и финансов анализ. Ранни клиенти описват визуалните резултати като по-„изпипани“, с по-добри оформления, анимации и дизайн усет, както и по-малко цикли за достигане до продукционен резултат.
Посочва се и че Claude Sonnet 4.6 достига представяне, сравнимо с Opus 4.6 на OfficeQA — тест, който проверява работа с корпоративни документи (диаграми, PDF-и, таблици), извличане на точните факти и логическо заключение на база тях.
Продуктови промени: инструменти в API, компактиране на контекст и MCP конектори в Excel
В Claude Developer Platform Sonnet 4.6 поддържа adaptive thinking и extended thinking, както и context compaction (бета) — автоматично обобщаване на по-стар контекст при приближаване към лимитите, с цел по-ефективно използване на контекстната „памет“.
В API инструментите за web search и fetch вече автоматично пишат и изпълняват код за филтриране и обработка на резултатите, така че в контекста да остава само релевантната информация — с цел по-добро качество и по-висока токен-ефективност. Anthropic отбелязва и обща наличност на функционалности като code execution, memory, programmatic tool calling, tool search и примери за използване на инструменти.
Компанията препоръчва при миграция от Sonnet 4.5 да се тества балансът между скорост и надеждност според конкретния продукт, тъй като Sonnet 4.6 цели силни резултати при различни нива на „thinking effort“, включително при изключено extended thinking. В същото време Opus 4.6 се посочва като предпочитана опция за задачи с максимално дълбоко разсъждение — например рефакторинг на кодова база, координация на множество агенти и сценарии, в които „перфектният“ резултат е критичен.
За потребителите на Claude в Excel добавката вече поддържа MCP connectors, което позволява работа с инструменти и доставчици като S&P Global, LSEG, Daloopa, PitchBook, Moody’s и FactSet. Claude може да извлича контекст извън електронната таблица без напускане на Excel, а връзките, настроени в Claude.ai, се пренасят автоматично в Excel. Функцията е налична за планове Pro, Max, Team и Enterprise.
Sonnet 4.6 е наличен във всички Claude планове, Claude Cowork, Claude Code, API и основните cloud платформи. За разработчици моделът може да се извика през Claude API с идентификатор claude-sonnet-4-6.
Какво означава това
- По-широка достъпност на „по-висок клас“ възможности — Sonnet 4.6 цели резултати, близки до Opus, при ценови нива като Sonnet 4.5.
- По-практична автоматизация без API — напредъкът в computer use улеснява работа със стари и специализирани системи, където конектори са скъпи или невъзможни.
- Голям контекст за реални корпоративни обеми — 1M токена (бета) е релевантно за големи кодови бази, договори и изследвания, когато се търси последователно разсъждение върху много материал.
- Фокус върху безопасността — подобрена устойчивост към prompt injection е ключова при използване на модели, които взаимодействат с уеб и бизнес системи.
- По-ефективни агентни работни потоци — подобренията в инструментите (web search/fetch, code execution, memory) целят по-стабилни многокомпонентни процеси и по-добра токен-ефективност.



